R²
R² 개요 R²(R-squared, 결정계수)는 통계학 및 기계학습에서 회귀 모델의 성능을가하는 대표 지표 중 하나입니다. R² 모델이 종속 변수(dependent variable)의 분산 중 얼마나 많은 부분을 설명할 수 있는지를 나타내는 값으로, 일반적으로 0에서 …
R² 개요 R²(R-squared, 결정계수)는 통계학 및 기계학습에서 회귀 모델의 성능을가하는 대표 지표 중 하나입니다. R² 모델이 종속 변수(dependent variable)의 분산 중 얼마나 많은 부분을 설명할 수 있는지를 나타내는 값으로, 일반적으로 0에서 …
MAE 개요 MAE(Mean Absolute Error, 평균 절대 오차)는 회귀(regression) 문제에서 예측값과 실제값 사이의 오차를 평가하는 대표적인 지표 중 하나입니다. 인공지능 모델, 특히 회귀 모델의 성능을 측정할 때 널리 사용되며, 오차의 절대값을 평…
매개변수 (Parameter) 1. 개요 매개변수(Parameter, 파라미터)란 인공지능 및 머신러닝 모델이 학습 데이터로부터 스스로 습득하여 최적의 값을 찾아가는 내부 변수를 의미한다. 모델의 예측값과 실제 정답 사이의 오차를 줄이기 위해 학습 과정에서 지속적으로 …
Hallucination 개요 Hallucination(환)은 인공지능, 특히 자연 처리(NLP) 분야에서 생성형 언어 모델(Gener Language Model)이 사실과 무하거나 허위인 내용을 자신감 있게 생성하는 현상을 의미합니다.는 모델이 학습 데이터에 기반하여…
PR-AUC (Precision-Recall Area Under the Curve) 1. 개요 PR-AUC는 정밀도-재현율 곡선 아래의 면적(Area Under the Precision-Recall Curve)을 수치화한 지표로, 이진 분류 모델의 성능을 평가하는 데 …
도메인 적합성 (Domain Suitability) 1. 개요 도메인 적합성(Domain Suitability)이란 인공지능 모델이 특정 분야(Domain)의 지식, 용어, 문맥 및 관습을 정확하게 이해하고 이를 바탕으로 해당 분야의 요구사항에 부합하는 결과물을 생성하…
Fairness Indicators Fairness Indicators는 머신러닝 모델의 예측 결과가 특정 사용자 그룹(인종, 성별, 연령 등)에 대해 편향되어 있는지 측정하고 시각화하여 모델의 공정성을 평가하는 오픈소스 도구 및 프레임워크입니다. 개요 머신러닝 모델은…
MSE 개요 MSE(Mean Squared Error, 평균 제곱 오차)는 회귀(regression) 문제에서 예측 모델의 성능을 평가하는 데 널리 사용되는 지표입니다. 이는 예측과 실제 관측값 사이의 차이(오차)를 제곱한 후, 그 평균을 계산함으로써 모델의 정확도를 …
AI 모델 규제 (AI Model Regulation) 1. 개요 및 정의 AI 모델 규제란 인공지능 기술이 사회 전반에 미치는 영향력을 고려하여, AI 시스템의 개발, 배포 및 사용 과정에서 발생할 수 있는 위험을 관리하고 법적·윤리적 기준을 준수하도록 강제하는 일련…
수동 평가 (Manual Evaluation) 개요 수동 평가(Manual Evaluation)란 인공지능(AI), 특히 자연어 처리(NLP) 및 생성형 AI 모델의 성능을 측정할 때, 컴퓨터가 자동으로 계산하는 지표(예: BLEU, ROUGE, 정확도 등)에 의존하지…
재현율 (Recall) 재현율(Recall)은 머신러닝과 데이터 과학 분야에서 분류(Classification) 모델의 성능을 평가하는 핵심 지표 중 하나입니다. 특히 불균형 데이터(Imbalanced Data)가 존재하거나, 거짓 음성(False Negative)의 …
편향 (Bias) 편향(Bias)은 인공지능, 특히 머신러닝 및 딥러닝 모델의 평가와 개발 과정에서 가장 중요한 윤리적·기술적 이슈 중 하나입니다. 이는 모델이 학습 데이터나 알고리즘 설계의 특성으로 인해 특정 그룹, 성별, 인종, 종교, 사회경제적 지위 등에 대해 체…
자동 추천 기능 개요 자동 추천 기능(Recommendation System)은 사용자의 과거 행동, 선호도, 컨텍스트 정보를 분석하여 개인화된 아이템(상품, 콘텐츠, 서비스 등)을 실시간으로 제시하는 기술이다. 전자상거래, 동영상 스트리밍, 뉴스 포털, 소셜 네트워크…
정밀도 정밀도(Precision)는 인공능, 특히 머신러닝 모의 성능을 평가하는심 지표 중 하나로, 모델이 '긍정'으로 예측한 샘플 중 실제로 긍정인 비율을 의미합니다. 주로 분류 문제에서 사용되며, 특히 불균형 데이터셋(imbalanced dataset)에서 모델의 …
프롬프트 기반 추 개요프롬프트반 추론(-based Reasoning) 인공지능, 대규모 언 모델(Large Language Models,LM)의 성능을 평가하고 향상시키기 위한 핵심적인 방법론 중 하나입니다 이 기법은 모델이 주어진(프롬프트)을 바으로 논리적 사고, 추…
LIME 개요 LIME (Local Interpretable-agnostic Explanations)는 복잡한 머신러닝 모의 예측 결과를 인간이 이해할 수 있도록석하는 데 사용되는 모 무관(model-agnostic)한 설명 기법입니다. 딥러닝과 같은 블랙박스 모델은 …
퍼플렉서티 개요 퍼플렉서티(plexity)는 자연어(Natural Language Processing NLP) 분야 언어 모델(Language Model)의 성능을 평가하는 대표적인 지표 중 하나입니다 직관적으로, 퍼플렉서티 모델이 주어진 텍스트 시퀀스를 예측하는 데 …
Bias Benchmark for QA 개 Bias Benchmark for QA질문-응답 시스의 편향 평가 벤치마크)는 인공지능 기반 질문-응답(Question Answering, QA 모델에서 발생 수 있는 사회적,화적, 성, 인종적 편향을 체계적으로 평가하기 위해…
Gender Bias Score 개요 Gender Bias Score(성별 편향 점)는 인공지능 모델, 특히 자연어 처리(NLP) 모델이나 이미지 생성 모델에서 성별에 기반한 편(bias)의를 정량적으로 평가하기 위해 사용되는표입니다. 이 점수는 모델이 특정 성별에 대…
성능 평가 인공지능(AI) 모델의 성능 평가Performance Evaluation)는 개발된 모델이 주어진 과제(Task)를 얼마나 정확하고 신뢰성 있게 수행하는지를 정량적·정성적으로 분석하는 과정입니다. 모델의 훈련 과정 이후, 성능 평가는 모델의 실용성과 신뢰성을…